文章

共 56 篇

「生信软件」

SeqMux:Rust 编写的快速便携 FASTQ 拆分器

基于样本 barcode 表的单端/双端 FASTQ demultiplexer:双 barcode 双方向匹配、UMI 提取、Hamming 容错、质量与 adapter 修剪、多线程有序输出,零运行时依赖。

「生信软件」

SAMRust:pysam 兼容的 Rust 原生 HTS 处理库

面向 Linux/HPC 的多线程 BAM/CRAM/VCF 处理库:Python 语义不变、热点路径跑在 Rust 上,fetch/count/coverage/depth/pileup 与 pysam 结果对齐、性能对齐 rubam。

「生信软件」

PAMlogo:PAM 文库测序分析一站式流水线

面向 Cas9 等基因编辑系统的 PAM 偏好分析命令行工具:从原始 FASTQ 到 WebLogo 图,质控、拆分、PAM 计数、Top-N 筛选、加权出图一条龙。

「生信软件」

FretHMM:单分子时间序列 HMM 状态分类工具

介绍开源工具 FretHMM:受 HaMMy 启发、用 Python 重写的单分子轨迹 HMM 分类。覆盖 CLI/GUI、Review Grid、 multi-start + BIC、ON/OFF 与 dwell 动力学,以及 v1.5–v1.6 的批次审查与 Windows 并行更新。

「数据整理」

使用tidyr包和dplyr包进行数据清洗

最近处理扩增子数据,很多数据需要转化整理,从而适用于ggplot2系列的可视化工作,之前常常在Excel表格中手动整理,今天记录写一下使用tidyr包和dplyr包进行数据整...

「数据整理」

处理fasta文件的简单命令

1. 将fasta中的header name替换为对应的fasta文件名 2. 提取fasta文件第一条序列信息 3. 批量修改文件名

「数据整理」

批量修改fasta文件的headers name

在使用一些生信软件前,你需要将你自己的数据整理成软件要求的格式,软件以及流程跑完了产出的文件,也需要整理成你自己想要的格式,以便于你将结果投喂给下一个软件或者进行可视化。我这...

「生信软件」

好用的细菌基因组组装与注释软件

1. Spades[https://github.com/ablab/spades] 细菌基因组组装最佳软件(主观感受),可进行二代组装,三代组装以及二代三代混合组装。 2...

笔记

使用ggplot2绘制菌群组成堆叠图

堆叠图主要看不同菌群在该样本中的相对比例,把每个样本的情况或者每个处理组的情况展示出来,可以大致看出样本的重复性好坏和不同处理间的某些菌群变化趋势。 1.门水平的堆叠图 2....

笔记

向ggplot2图中添加系统进化树并共享y轴

最近做细菌比较基因组学分析,跑了一下Roary软件,出来了一些结果和图,看了看Roary软件github上的作图代码,使用的python语言对系统进化树和gene prese...

笔记

使用plasmidID软件组装细菌质粒(reference-based方法)

细菌质粒相比较于细菌染色体基因非常容易发生水平转移,质粒可从环境中获得质粒或丢失掉。质粒的存在往往有利于细菌的生存,,质粒上常常带有抗生素抗性基因,毒力基因以及解毒基因,是细...

笔记

使用ComplexHeatmap包绘制复杂热图(pheatmap真不香)

之前绘制热图主要使用pheatmap,开始觉得这个包又简单又美观,但用多了以后自己对热图要求高了,发现这个包不是太灵活,很多细节没有提供参数来调整,一些需求需要自己调用底层的...

「生信软件」

细菌质粒组装

pATLAS smaegol/PlasFlow BU-ISCIII/plasmidID phac-nml/mob-suite zhenchengfang/PPR-Meta S...

笔记

使用python处理生物信息数据(十)

Python学习的第十天,好些天没有学习python了。4月6号下午回武汉了,从汉口火车站下车,车站弥漫着消毒水的味道,有些疫情防控人员全副武装,有些工作人员引导我们扫码入地...

笔记

使用python处理生物信息数据(九)

Python学习的第九天,主要学习如何写自己的函数功能。 1. 从PDB文件中提取fasta序列 2. 写一个极简单的函数 3. 使用struct模块将字符串转为元组 4. ...

笔记

使用python处理生物信息数据(八)

Python学习的第八天,主要学习文本挖掘和模式匹配。 生物信息大多数问题都是核酸或氨基酸序列的比对和寻找motif,利用正则表达式显得十分重要。比如一条核酸或氨基酸序列,你...

笔记

使用python处理生物信息数据(七)

Python学习的第七天,主要学习数据排序。 1. 表格按指定列排序并写入文件。 2. 字典排序 3. 元组排序 4. 根据DNA序列长度排序 5. 根据两列对逗号分隔的文件...

笔记

使用python处理生物信息数据(六)

Python学习的第六天,主要学习处理表格数据。 1. 表格中列的融合 2. ZIP()函数的使用 3. 创建一个表格 4. 用字典展示表格 5. 从文件中读取表格 5. 将...

笔记

使用python处理生物信息数据(五)

Python学习的第五天,主要学习数据的过滤。 1. 转录组差异分析数据的过滤 Cuffcompare软件进行了转录组表达量的比较和统计,至少存在于3个生物学重复中的两个样本...

笔记

使用python处理生物信息数据(四)

Python学习的第四天,有点懈怠了没坚持每天一更。 1. RNA序列转换成蛋白序列 2. 从fasta序列文件中查找insulin序列 3. 从fasta序列文件中查找不含...

笔记

使用python处理生物信息数据(三)

Python学习的第三天。 1. 整合质谱数据到代谢通路中 假设你想确定癌症细胞样品中的一些蛋白属于哪些代谢或调控通路,首先你有一个文件数据包含细胞循环相关通路的蛋白列表,然...

笔记

使用python处理生物信息数据(一)

趁疫情被封闭在家,学习一下python,之前尝试过看过perl的书,代码看得我一脸懵逼,python乍看上去和蔼可亲多了,再加上有个师兄鼓励和推荐学习python,找了这本书...

笔记

使用nCov2019包可视化新冠肺炎疫情

从今年1月24号县城封城到现在已经整整一个月了,在家憋得难受,小区不让进出,连小区楼下也不让溜达了,就想出去走走,哎,还是不跟国家添堵了,坚持就是胜利。最近Y叔发布了一个R包...

笔记

使用bioconda安装CheckM

1.bioconda构建名为py27的虚拟环境并安装checkm 2.checkm数据库设置 (note instructions here are incorrect - ...

笔记

使用Unicycler进行细菌基因组组装

二代测序技术的迅速发展大幅度的降低了高通量测序价格且提高了测序质量,同时高通量测序相关的数据处理和分析的软件也是越来越好用。SPAdes在二代测序小基因组的组装上表现优异,使...

笔记

使用MetaboDiff包分析非靶向代谢组数据

最近手里有个非靶向代谢组的数据,通过学习MetaboDiff包来熟悉代谢组分析的思路和流程,接下来的流程来自于MetaboDiff包官方帮助文档。 1. MetaboDiff...

笔记

使用IQ-TREE构建系统进化树

最近投文章,审稿人问了一个关于系统进化树的问题。 Reviewer: 1 I still don't understand, why authors sequence 486...

笔记

R在数量生态学分析中的应用(一)

Numerical Ecology with R 这本书2018年出了第二版,第一版有中文版的书籍。自己的课题涉及微生物生态学,但时常对生态学中的一些专业名词概念和分析方法不...

笔记

使用ggupset画韦恩图

对于不同数据集合的比较的可视化,一般用韦恩图来表示,但是数据集合太多了,就不好看了,反而不容易从图中获得信息了。 三个集合看起来最合适。 2012年发表的香蕉基因组文章中的韦...

笔记

使用anvi'o进行宏基因组的组装和分箱

这部分教程来自Happy Belly Bioinformatics网站, 主要比较宏基因组的单样品组装和多样品联合组装这两种组装策略以及宏基因组数据的可视化。 教程简介 一般...

笔记

使用ggord包进行PCA分析和作图

PCA(Principal Component Analysis)主成分分析, 用来考察多个变量间相关性一种多元统计方法,研究如何通过少数几个主成分来揭示多个变量间的内部结构...

笔记

使用anvi'o 进行 phylogenomics分析

Phylogenomics直接翻译是种系基因组学,下面是维基百科上它的解释:Phylogenomics is the intersection of the fields o...

笔记

使用ggplot2和ggrepel包做火山图

我是个R新手,只会简单的画一些图,还不能随心所欲的画图。Hadley Wickham男神的ggplot2包以及tidyverse超级大包真是让人膜拜!最近实验室留学生让我帮他...

笔记

使用R分析16s扩增子α,β多样性

这部分教程依然来自Happy Belly Bioinformatics网站, 主要学习一下使用DADA2获得ASVs数据之后的进一步分析。譬如,微生物群落多样性,样品间的微生...

笔记

sed与awk的学习(一)

了解基本操作 以下是sed&awk书上的范例 sed基本操作 创建sed&awk文件夹 编辑list文件,将书上的示例内容粘贴进去 将list文本中的MA替换成Massach...

笔记

使用CompareM计算细菌基因组间的amino acid identity

手里有一个细菌的基因组序列,如何分析和挖掘基因组信息对我是一个头疼的问题!!先依葫芦画瓢吧,看了一些文献,很多做比较基因组学分析,计算了多个基因组之间的平均核酸一致性aver...